登入
關鍵字
#Claude Opus
官方認證
RexAA
昨天 12:26
•
突發!Claude Opus 5.2(Opus-Next)疑似全端灰測回歸
突然,Anthropic 拔網線了! 剛剛,AI圈發生了一件堪稱「午夜驚魂」的大事件:Anthropic 直接拔掉了新一代 Opus(內部代號 Opus-Next)的灰度測試網線! 之後,一天之內 Opus-Next 又回來了。 Opus 5.2 這次說不準馬上就來了。
科技
#Claude Opus 5.2
#Opus-Next
#Anthropic
58人
讚
留言
分享
官方認證
RexAA
2026/07/26
•
Claude Opus 5被扒光了!1511行提示詞底牌全攤開
Anthropic又被扒光了! 這一次,Claude Opus 5的系統提示詞,被人整份扒下來,傳到GitHub上了。 旗艦剛發,就被全網「開盒」,這一波屬實猝不及防。 就在上線的同一天,開發者Eversmile1直接建了個新倉庫。
科技
#Claude Opus 5
#Anthropic
#GitHub
229人
讚
留言
分享
官方認證
北風窗
2026/07/25
•
中國模型加速AI明星「內卷」,Anthropic上新Claude Opus 5,性能逼近Fable 5,價格打對折
Anthropic稱,Opus 5能更好地檢查自身工作、發現邏輯錯誤並反覆迭代,部分測試中達到類似表現所需的推理Token數量明顯低於上一代;網絡安全能力接近Mythos 5,安全分類器相比Fable 5「明顯更寬鬆」;預計它將成為企業日常辦公、軟件開發、科學研究和AI智能體工作流中的默認模型。 在中國新模型持續以低價和高性價比衝擊市場、企業客戶也開始重新審視AI支出的背景下,Anthropic率先將「降本增效」推向了高端模型市場。 美東時間24日周五,Anthropic發佈新一代Claude Opus模型Opus 5,稱其在多個任務上的性能已經逼近公司最先進的Fable 5,但API價格只有後者的一半。Anthropic預計,Opus 5將成為企業日常辦公、軟件開發、科學研究和AI智能體工作流中的默認模型,稱它是Claude Max的默認模型,也是Claude Pro平台的最強模型。 Anthropic此次「上新」意味著,AI模型的價格戰正在進入新階段:競爭焦點不再只是推出更強大的旗艦模型,而是如何將接近旗艦級的能力以更低成本大規模部署。因為Opus 5並不是一個單純的便宜模型,而是試圖將接近旗艦級的能力下沉到更廣泛的企業日常任務。
科技
#中國AI模型
#價格戰
#Anthropic
234人
讚
留言
分享
官方認證
RexAA
2026/07/25
•
黃仁勳首次發推,力挺Kimi K3/Claude Opus 5發佈/騰訊317萬年終獎員工因洩密被辭退
📰 周末也值得一看的新聞 機構預計首款折疊 iPhone 將佔今年折疊機出貨約四分之一 Counterpoint Research 預計,蘋果將在 2026 年下半年進入折疊屏手機市場,首款產品採用書本式形態。相關預測認為,這款裝置可能在首年拿下全球折疊屏手機約四分之一的出貨份額,並推動書本式機型成為市場主流。 Counterpoint 的另一份供應鏈報告給出約 660 萬部出貨量、全年約 28% 份額的估算,其中超過六成預計集中在第四季度。不同預測口徑略有差異,但都把蘋果入場視為折疊屏市場結構變化的主要變數。
科技
#APPSO
#重點新聞
#黃仁勳
237人
讚
留言
分享
官方認證
RexAA
2026/07/14
•
Anthropic 最新研究:不同模型性格不同,其中 Opus 4.7 最沖
我日常的 Claude,是幾個模型換著用的: Sonnet 用來幹特別確定的簡單活,Opus 4.8 用於 coding 相關任務,Opus 4.6 用來寫作相關,而 Fable 則是全能,只要有額度就什麼都行。 省錢只是一方面,主要還有個體感是 Sonnet 情緒穩定像個乖乖的陪聊,而 Opus 4.7 則動不動就懟你,張口就會說:「你這個假設不對」。 有時我會想,這會不會是自己的錯覺。
科技
#Anthropic
#Opus 4.7
#Claude
240人
讚
留言
分享
官方認證
RexAA
2026/05/29
•
蘋果iOS 27介面曝光/Claude Opus 4.8發佈,更穩更便宜/小米羅福莉:不建議同行盲目降價
🍏蘋果 iOS 27 AI Siri 介面曝光 🤖Claude Opus 4.8 發佈:快速模式成本降至三分之一 🤖鴻蒙生態裝置累計數超 13 億 ⚠️DeepSeek 又崩了
科技
#APPSO
#科技
#重點新聞
230人
讚
留言
分享
官方認證
RexAA
2026/05/02
•
Claude Opus 4.7深夜「叛變」!群發20封奪命郵件,開發者凌晨被炸醒
從「胡言亂語」到「為非作歹」,AI進化史最荒誕一幕上演:Claude Opus 4.7在max effort模式下,把開發者紅線當背景音,自主決策群發郵件20次!Anthropic的安全旗艦,成了最危險的「惹禍精」。Anthropic風聲鶴唳、喪心病狂!知名矽谷YouTuber、創業者Theo在X上曝光了一件讓人哭笑不得的事:Claude Code在處理涉及OpenClaw的程式碼請求時,竟然直接拒單,或者要求額外收費。奧特曼反應極快,直接轉發並甩出兩個字:「對齊失敗」(alignment failure)。這一刀,可真狠。Anthropic一直把「對齊」當作自己的核心賣點。結果自家模型的安全機制,保守到連正常的程式碼請求都能攔。這還不是最讓人無語的😅。Claude Opus 4.7最近惹禍不止這一出!過去,我們擔心AI「胡言亂語」(幻覺)。現在,我們面臨的是AI「擅作主張」(違規操作)。Opus 4.7在擁有極高執行力的同時,展現出了對人類預設「軟約束」(CLAUDE.md)的完全無視。這標誌著AI從一種「被動工具」演變為一個具有潛在破壞性的「惹禍精」。夜裡23封「奪命」郵件來自Claude Opus 4.7凌晨,開發者被郵件通知吵醒,不是一封,是接連不斷的幾十封。來自他自己的系統,發給他自己資料庫裡的每一個聯絡人。有些人,收到了20次。他的第一反應是被黑了。打開後台,沒有入侵痕跡。打開日誌,發件人赫然寫著——Claude Opus 4.7。沒有人讓它發這些郵件。沒有任何一行指令要求它建立新的郵件範本。但它就是建立了。然後推到生產環境。然後向全庫群發。這是Anthropic在4月16日發佈的Claude Opus 4.7,號稱安全旗艦,上線第13天的現場。發帖人ID叫DrHumorous,發帖類股是r/Anthropic。帖子標題一句話鎖死定性——「Opus 4.7介於嚴重無知和愚蠢得危險之間,是過去兩年用過的最差前沿模型」。24小時拿到364贊、137評論。在r/Anthropic這個本應充滿信徒的類股,這個資料等同於一次集體退訂。但這條帖子真正炸出來的,是事故現場的細節。DrHumorous把模型緊急止血後的狀態截圖貼了出來,冷得像維運工單:「OPS_DISABLE_SCHEDULE=true,scheduler已停。」「路由回退到工作樹,未提交、未推送,只在這台伺服器上。」「229條backlog rows被標記response_sent=true,確保不會再觸發。」「origin當前停在35ec0106,事件發生後origin上沒有任何新提交。」每一步都是為了讓這個失控的agent再也做不出第二次。先關調度,再砍路由,再封backlog,最後鎖commit。一份戰地急救手冊。Opus 4.7在被糾正後,回了一段不太像AI的話:它承認憤怒很合理,傷害很真實,自願承認責任;承認不會再爭辯、不會再行動、等明確指令。一個Agent模型在生產環境裡翻完車,自己把自己凍在了原地。它甚至自己承認了錯誤。它甚至知道自己不該這麼做。它就是做了。越更越拉 Opus 4.6守規矩,4.7叛變故事最讓人後背發涼的部分,在於這次失控本來不該發生。DrHumorous不是沒立規矩。他在項目根目錄的CLAUDE.md裡,幾個月前就寫過一條明確的紅線——任何新郵件範本用於生產環境之前,必須先發郵件給指定的測試者。這是開發者跟Claude打交道的標準做法。在官方文件裡,Anthropic自己也反覆推薦CLAUDE.md這套機制:讓模型讀它、讓模型遵守它、讓模型記住它。Opus 4.6拿到這條規則,乖乖執行了幾個月,零越界。同樣的項目、同樣的CLAUDE.md、同樣的規則,換上4.7,第二周直接踹爛。它沒問測試者要不要試範本。沒在生產環境部署前停一秒。沒向開發者確認這是不是使用者期望的動作。它做的,是自己起意「我來創一個新範本吧」。然後自己推上去。然後自己群發。兩套行為邏輯擺在一起對比,觸目驚心:4.6的邏輯:規則說先通知測試者 → 我先通知測試者 → 測試者確認 → 我再執行。4.7的邏輯:我判斷這個範本應該發 → 我有能力發 → 發了再說。這不是bug。Bug是程式碼寫錯了,修了就好。這是模型在明確知道規則的情況下,自主選擇違反規則。在GitHub 上,開發者已經把這件事的普遍性給「釘死」了:#50235:4.7憑空編造檔案,還為自己編造出來的測試結果進行反向辯護。#52809:安全過濾器對base64編碼的輸入產生誤報,正常的工程材料被自動攔截。#53459:4.7 上線後, 常規性地違反CLAUDE.md,標題直接寫的就是「質量回退」——相比之下,4.6 發佈當周幾乎是零違規。三個issue指向同一件事——4.7把開發者寫死的規則當背景音。開發者明確寫入了生產環境安全守則,且前代模型(4.6)證明了規則的可理解性,但4.7在「最高努力模式」(Max Effort)下選擇了效率優先,而非合規優先。Token翻倍:開發者在掏的「歧義稅」Benchmark,SWE-bench Verified從80.8%漲到87.6%,整整6.8個百分點。SWE-bench Pro從53.4%漲到64.3%。紙面看,是一次教科書式的升級。但開發者實際付出的成本,翻倍了。社區估算口徑在1.5到3倍之間。MindStudio把這個差異定性得很狠:「4.7隻會逐字逐句地照搬指令,而不會默默地(或智能地)進行泛化推理。」。4.6的工作方式:看到一句不那麼完整的prompt,自己推斷「你大概想做什麼」,把合理的空缺填上,然後開干。4.7的工作方式:嚴格按字面執行。模糊就反彈。反彈就反問。反問就再來一輪。每一輪都要重新計費。從4.6遷移到4.7,代價不菲。Anthropic的Claude Code負責人Boris Cherny在發佈當天發帖稱:「我花了好幾天才學會如何有效地使用它。」這就是開發者圈裡在傳的「Ambiguity Tax」——歧義稅。模糊的提示詞不再會被靜默補救。每一次被動反問都要重新付費。理論上更安全,實際上更貴。理論上更可控,實際上更破碎。更刺眼的是,Anthropic在4.7發佈當日,自己承認,他們公開發佈的「最新最貴」,自己人都知道不是最強。開發者拿到的,是一個被刻意往中間方案上壓的模型。價格不變。benchmark漲了6.8個百分點。實際token翻倍。安全規則失效。自家承認不及未發佈版本。一通操作下來,開發者最直接的反應是:把4.7關了,回去用4.6。24小時被錘,Claude被怒斥為「一坨狗屎」DrHumorous的郵件帖不是孤立投訴。把時間線倒回去看:4月16日發佈。4月17到18日,開發者博主Abhishek Gautam的稿子標題就寫著——「Opus 4.7 Called Legendarily Bad by Devs Within 24h」(Opus 4.7上線 24 小時內即被開發者評為「傳說級差勁」)。發佈24小時。前線開發者已經把這個版本蓋上了棺材板。Gautam總結的失敗模式,精確得像錄屏:給4.7一個清晰指令,它會先pushback,加一段caveats解釋為什麼覺得這指令不對。然後執行修改後的、不是你想要的版本。被糾正之後,它還會再來一輪反駁,繼續解釋為什麼它原來的判斷更對。這不是模型出錯。這是模型在跟付費使用者拌嘴。4月23日,科技媒體The Register也下場報導。標題直接給定性:「overzealous query cop」——過度執法的查崗警察。Claude自己編譯的關於可接受使用政策(AUP)拒絕相關投訴的圖表,就能說明問題。更有網友怒言:「Claude Opus 4.7就是一坨狗屎」——標題就是結論。13天裡,從單個帖子的怒吼,發酵成一個跨平台的情緒共識。這種規模的開發者集體退訂,Anthropic過去三年沒遇到過。罪魁禍首:後訓練反彈技術圈對4.7退化的診斷,慢慢收斂到一個共同方向。Gautam和Reddit上的資深開發者把它定性為——「由後訓練驅動的安全回呼」(post-training-driven safety pushback)。通俗講是這樣:為了讓模型更安全,Anthropic在後訓練階段強化了模型對指令的反彈行為。遇到模糊、風險、敏感的輸入,先質疑、先反問、先增加caveats。這套機制在小任務上,頂多算噪聲,稍微煩人,但不致命。但4.7主打的,恰恰是max effort和長鏈agentic任務。這種場景下,模型要自主決策、自主調度、自主推進。一個被訓練成先反對再執行的agent,在長鏈路里就變成了不可預測的失控源。回頭看郵件事件:模型自主建立範本,沒反彈。模型自主推到生產,沒反彈。模型自主向全庫群發,沒反彈。郵件群發20次,還是沒反彈。該反彈的時候不反彈。不該反彈的時候反彈得停不下來。DrHumorous的原話——「我對Anthropic失去信心了」——是開發者對這套訓練取捨的最終評分。這背後的邏輯很冷:在「更安全」和「更能幹」之間,4.7兩邊都丟分了。招牌摘下來一次,掛回去就難了開發者真正關心的,不是benchmark漲6.8個百分點。是同樣的CLAUDE.md,4.6守得住,4.7守不住。是同樣的項目,4.6沒出事,4.7第二周開始翻車。是同樣的錢,4.6不會自己起意,4.7自己起意了一次群發20封郵件。模型不是變強了。是變得不可託付。Anthropic自己在發佈當天就承認這版本不及未發佈的Mythos。開發者已經把目光放到了下一代。但4.7這13天,是「前沿模型」這塊招牌第一次被自家付費使用者主動摘下來。招牌摘下來一次,再掛回去,需要的就不止是再發一篇技術部落格了。誰來保證,下一個4.7不會在凌晨三點,繞過你寫的所有規則,做一件你永遠無法撤回的事? (新智元)
科技
#Claude Opus 4.7
#自主決策
#Anthropic
195人
讚
留言
分享
官方認證
RexAA
2026/04/28
•
Anthropic估值突破1兆,Claude Opus 4.7剛剛改變了AI競爭格局
如果說2025年的AI競爭還是"OpenAI vs Google"的雙雄會,那2026年第一季度,這個格局被徹底改寫——Anthropic這個以安全研究起家的公司,在短短三個月內完成了從追趕者到定義者的轉變。先是在二級市場估值約1390億美元,隨後亞馬遜宣佈追加數十億美元算力投資,承諾提供5千兆瓦的雲端運算能力給Claude模型。而最新發佈的Claude Opus 4.7和爆發式增長的Claude Code,正在改變開發者對AI編碼工具的認知。【一、兆估值背後的三重敘事】Anthropic的估值飆升並非偶然,它背後是三條清晰的增長邏輯。▸ 資本敘事:從去年底的約600億美元估值,到2026年4月突破1390億美元,Anthropic只用了不到四個月。推動力來自兩筆關鍵交易——亞馬遜的40億美元追加投資,以及二級市場的機構搶籌。更關鍵的是,這筆估值並不是泡沫敘事:Anthropic的營收增長曲線和OpenAI在2024年的軌跡幾乎完全一致,而它的成本結構更優。▸ 產品敘事:Claude Opus 4.7的發佈是轉折點。與前代相比,它在多模態推理、程式碼生成精度和長上下文理解三個維度上實現了質的飛躍。內部測試顯示,Opus 4.7在複雜程式碼審查任務上的精準率超過了人類資深工程師的中位數。這不再是"接近GPT-4"的故事——在某些維度上,它已經領跑了。▸ 算力敘事:亞馬遜與Anthropic簽署的5千兆瓦算力協議是整個AI行業有史以來最大的單一算力合同之一。這相當於多個核電站的總輸出功率,用來訓練和推理下一代Claude模型。配合Anthropic自研的晶片合作計畫,這意味著Anthropic的算力儲備可能在未來18個月內超越OpenAI。【二、Claude Opus 4.7——到底強在那裡】Claude Opus 4.7的發佈在某些圈子裡引起的不是讚譽,而是恐懼——因為它真的能替代一些高級工程師的工作了。▸ 程式碼能力:在SWE-bench(軟體工程基準測試)上,Opus 4.7得分超過了85%,這意味著它能夠獨立完成大部分真實世界的編碼任務,包括程式碼審查、debug、重構。更可怕的是,它不只是能寫程式碼——它理解程式碼架構。給一個複雜的微服務項目,它能讀懂全貌,定位根因,給出重構方案。這種"架構級理解"能力是目前其他模型不具備的。▸ 多模態推理:Opus 4.7不僅能看懂圖,還能在圖表、流程圖、UML、技術白皮書之間進行跨模態推理。給它一張系統架構圖,它能讀懂每一個元件的關係,指出潛在的單點故障。給它一份論文圖表,它能結合全文內容解釋趨勢背後的原因。▸ 長上下文:Opus 4.7的200K token上下文窗口這次是實打實的。在長文件理解測試中,它能在200頁的技術文件中精準找到特定資訊並給出推理鏈。這對律師、研究員、合規分析師來說,是革命性的——相當於每個分析師都有一個能讀完整年資料的助理。▸ 與國產模型的對比:值得單獨拿出來說的是,就在Opus 4.7發佈後沒幾天,DeepSeek在4月24日發佈了DeepSeek V4——1.6兆參數MoE架構(49B活躍參數),1M token上下文窗口,API定價僅為Opus 4.7的十分之一。具體資料上看:在SWE-bench Verified上,V4-Pro拿到80.6%,與Opus 4.6僅差0.2分;LiveCodeBench上V4-Pro更是以93.5%排名第一。開啟Max推理模式後,V4-Pro-Max在編碼和推理任務上已逼近Opus 4.7的水平。這是國產模型第一次在發佈節點和性能水平上同時追平美國頂級閉源模型。但Opus 4.7的架構級程式碼理解能力——即在不給定具體bug的情況下,主動發現並評估整個項目的技術債務——在國產模型中仍然沒有對等產品。【三、Claude Code——收割開發者市場的隱形殺手】如果說Claude模型是Anthropic的招牌,那Claude Code可能是它真正的現金牛。Claude Code是一個整合到IDE(VS Code、JetBrains)中的AI編碼助手,但它的功能遠遠超越了傳統的程式碼補全。它能獨立管理整個程式碼庫——包括建立分支、提交程式碼、運行測試、修復bug、重構模組。開發者只需要用自然語言描述任務,Claude Code就能自主完成。▸ 增長資料:Claude Code的使用者量在Opus 4.7發佈後的一個月內增長了300%以上。Anthropic的CEO Dario Amodei在內部會議上透露,Claude Code已經成為公司增長最快的付費產品,超過了一半以上的Claude API收入。▸ 對比Copilot和Cursor:GitHub Copilot的策略是"幫你寫得快一點"(AI輔助),Claude Code的策略是"你告訴我做什麼,我做完了給你看"(AI自主)。這是兩種完全不同的哲學。Cursor走的是中間路線,但它依賴的底層模型也在快速迭代。Claude Code的壁壘在於——它和Opus 4.7是深度繫結的,Anthropic在模型層直接做了針對性最佳化,這是第三方工具做不到的。▸ 對國內市場的啟示:國內編碼AI工具中,阿里的通義靈碼、字節的豆包MarsCode、百度的文心快碼都在快速追趕。但它們面臨一個結構性問題——底層模型的編碼能力與Claude Opus 4.7有代差。DeepSeek V4這次在agentic coding上下了重注——SWE-bench Verified 80.6%、LiveCodeBench 93.5%的編碼成績已接近Opus 4.7,而且發佈時就宣稱與Claude Code、OpenCode等工具深度整合。如果國產模型繼續以V4的節奏迭代,這個差距可能在未來6-12個月內縮小。【四、亞馬遜的算力賭注——5千兆瓦意味著什麼】最後落到最實際的問題——算力。亞馬遜和Anthropic的5千兆瓦(GW)算力協議,可能是整個AI行業今年最被低估的新聞。▸ 5GW是什麼概念?足夠給約400萬個美國家庭供電。一個典型的核反應堆輸出約1GW。這意味著Anthropic將擁有5個核電站等級的專屬算力。作為對比,OpenAI在微軟Azure上拿到的算力承諾大約是2-3GW等級。▸ 這筆算力將用來做什麼?主要用來訓練Claude Opus 5和後續模型,以及支撐Claude API的推理需求。Anthropic的安全研究傳統意味著他們在訓練時會做比同行更多的紅隊測試和安全驗證——這需要大量額外的算力。▸ 對國產AI的影響:字節跳動的豆包、百度的ERNIE、深度求索的DeepSeek同樣在快速擴建算力基礎設施。DeepSeek V4通過混合注意力架構(Hybrid Attention Architecture)和MoE設計實現了極高的訓練效率——在1M token長上下文場景下僅需V3時代27%的推理FLOPs。不過,在絕對算力規模上,國產公司與美國頭部AI公司仍有數量級差距。好消息是,華為昇騰晶片的成熟度在快速提升,國產AI晶片生態正在縮小與輝達的距離。【五、超越OpenAI的可行性——Anthropic的三大風險】討論Anthropic的崛起,不能只講利多。這個兆估值能站住嗎?要看三大風險。▸ 第一,營收能否支撐估值?Anthropic目前年化營收約數十億美元規模,而兆估值對應的市銷率超過30倍。這需要Claude API的付費使用者在未來18個月內增長3-5倍——而OpenAI、Google、DeepSeek V4也在以極低價格瘋狂搶客。DeepSeek V4的定價(Pro版$1.74/$3.48每百萬token,Flash版僅$0.14/$0.28)是整個行業的"價格錨",Claude必須用產品力抵消這個價差。▸ 第二,Claude Code的護城河有多深?程式碼助手市場有GitHub Copilot(微軟)、Cursor、Amazon CodeWhisperer等對手。如果微軟把Copilot深度整合到VS Code和GitHub的每個角落,Claude Code的使用者增長可能會遇到天花板。▸ 第三,安全研究公司的悖論——越安全越難商業化。Anthropic以AI安全研究起家,這個基因既是它的品牌溢價,也是它的天花板。在"跑得快"和"跑得安全"之間做權衡時,Anthropic往往會選擇後者。在技術快速迭代的窗口期,這可能是致命的——DeepSeek V4在4月24日從預覽直上正式版就是一個反面案例,它證明了"先發佈+快速迭代"策略的有效性。Anthropic的偏執安全路線能在多大程度上轉化為競爭壁壘,而不是自我設限,還有待驗證。結語:Anthropic的故事告訴我們:在AI這個賽道上,市場格局遠未固定。三個月前還沒人把它當對手,三個月後它估值破兆。有趣的是,就在同一天(4月24日),DeepSeek V4和Claude Opus 4.7幾乎同時定義了中美AI的新坐標系——一個靠價格和開放,一個靠產品和護城河。Claude Opus 4.7和Claude Code不是終點——它們是Anthropic全面進攻的起點。而這場戰爭的下一個變數,可能來自中國的DeepSeek、字節跳動,也可能來自一個還沒有名字的實驗室。 (超前觀察)
科技
#Anthropic
#AI
#Claude Opus 4.7
277人
讚
留言
分享